融合算子：Cosine-Square-Affine-Gate（一次核内完成仿射、余弦平方与 Sigmoid 门控，返回 y = x * σ(α * cos(z)^2 + β)，其中 z = x*scale + bias）。余弦平方可用于周期信号的能量型门控。

目标与定义
- 输入张量：`x[B, D]`
- 逐维参数：`scale[D]`、`bias[D]`
- 标量超参：`alpha`、`beta`
- 计算流程：`z = x*scale + bias`，`v = cos(z)^2`，`g = sigmoid(alpha*v + beta)`，`y = x * g`

参考实现（文件要求）
- `torchcode.py`：PyTorch 参考 `Model`；统一的输入与初始化接口
- `cudacode.py`：单核融合（仿射+cos^2+sigmoid+乘法）；编译 `-O3 --use_fast_math`
- `run_code.py`：100 次迭代；精度 `rtol=1e-03, atol=1e-06`；打印加速比

CUDA 实现要点
- 行并行：`grid = B`，块内沿 D 连续访存；一次遍历写回 `y`
- 对齐向量化：满足 16 字节对齐且 `D%4==0` 时使用 `float4`；否则标量路径
- 指令优化：仿射用 `fmaf`；`cosf` 走 `--use_fast_math`；循环 `#pragma unroll 4`
- 线程配置：推荐 `block=1024` 起步，按设备与规模试探最佳

评估与目标
- 精度：与 PyTorch 参考在 `rtol=1e-03, atol=1e-06` 范围内一致
- 性能：≥1.0x 加速；触发向量化与良好占用时更优

加分项（可选）
- 未对齐路径尾处理优化与分支收敛
- 在大 D 场景每线程处理多元素以提升吞吐

